GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷
GPT-6第1天直接攻破5道Erdős难题!Fable 5.1交了白卷在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
搜索
在Epoch AI与曼彻斯特大学发布的FrontierMath Erdős基准测试中,GPT-6 Astra以3%得分率成为唯一非零分模型并解开5道Erdős难题,而GPT-5.6 Sol、GPT-5.5、Fable 5.1与Claude Fable 5均交白卷。
Manus团队在评测模型深度研究报告质量时,构建了"信息量"与"隐喻率"两项指标,分别通过抽取事实点和统计每百句隐喻数量来衡量信息密度与文风易读性,在覆盖9个主流模型36道题目的Research Bench测试中发现Claude Fable-5隐喻率最高、GPT旗舰模型信息密度低于Claude系列。
Claude Fable 5.1发布数小时内即遭知名黑客Pliny the Liberator越狱,其在GitHub公开泄露了超27万字的完整系统提示词,曝光了模型的安全规则、记忆禁区及46个内置工具架构等核心细节。
一觉醒来,Anthropic再次改写了机器智能的坐标系。
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 5.1 多项基准测试超越上一代,缓存读取成本降低 75%,典型任务整体费用降低约 25%、高 Agent 化任务最高降低约 45%,Mythos 5.1 则面向经审核的高风险领域合作伙伴提供更宽松能力并采用更严格的访问控制。
今夏,数学圈震动不断——OpenAI的Astra模型一举解决10个长期悬而未决的数学问题(包括非sofic群的存在、高维球堆积新的结果等);Claude Fable 5找到近百年Jacobian猜想的反例,之后还极大推动了黎曼猜想!
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
近日,Oh My Pi 作者 can1357 在 X 上发文,展示了利用模型 API 漏洞,直接提取 GPT-5.6、Claude Fable 5 等顶级模型完整内部推理记录的方法。他发现,做到这些并不用破解加密,只需要关闭模型的隐藏思考,再给它一个思考工具,就能让模型主动输出内部推理格式。
就在刚刚,智谱发布了其最新一代旗舰模型GLM-5.3,并宣布模型将在两周内开源。这是一个拥有7430亿个参数的模型,和此前的GLM模型一样主打编程。在多项主流基准测试中,GLM-5.3位居所有已开源或即将开源模型中的第一;其在编程与智能体任务上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外顶尖模型。
Claude这次,真把AI编程榜单打出断层了!就在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率再次登顶。 排在第四的GPT-5.5更惨。不仅成绩只有10%,甚至还被自家前辈GPT-5.4按在地上摩擦。